Papers by Pau Li Lin
GeBioToolkit: Automatic Extraction of Gender-Balanced Multilingual Corpus of Wikipedia Biographies (2020.lrec-1)
Copied to clipboard
| Challenge: | a tool for extracting multilingual parallel corpora at sentence level with document and gender information from Wikipedia biographies. |
| Approach: | They propose a tool for extracting multilingual parallel corpora at sentence level with document and gender information from Wikipedia biographies. |
| Outcome: | The proposed tool extracts a corpus of 2,000 sentences in English, Spanish and Catalan. |